AI加速一切!数学防线刚失守,物理已在AI射程内
AI加速一切!数学防线刚失守,物理已在AI射程内今夏,数学圈震动不断——OpenAI的Astra模型一举解决10个长期悬而未决的数学问题(包括非sofic群的存在、高维球堆积新的结果等);Claude Fable 5找到近百年Jacobian猜想的反例,之后还极大推动了黎曼猜想!
搜索
今夏,数学圈震动不断——OpenAI的Astra模型一举解决10个长期悬而未决的数学问题(包括非sofic群的存在、高维球堆积新的结果等);Claude Fable 5找到近百年Jacobian猜想的反例,之后还极大推动了黎曼猜想!
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
Claude Code 又更新了一个颇有意思的小功能。 这一次,它可以帮你起草反馈报告了。 当某个功能出现故障、Claude 发现自己犯了错误,或者你告诉它哪里出了问题时,它会自动把相关情况整理成一份报告。
因为一份Markdown,Claude Code可能要被踢出门了。最近,Shopify CEO Tobi Lütke突然在X上发话——我正在考虑禁止Shopify使用Claude Code。除非他们改主意,开始支持读取AGENTS.md和.agents/skills 。
今天,又有消息曝出:全新Opus 5.1模型,据传将在本周突袭发布。 从此,智能体赛道又要大洗牌了。 它有碾压级的编程能力、复杂的逻辑推理和长时间运行的AI Agent能力。单Token的智能水平,将再次被推到极限!
最近,Claude 官方晒出了不少很酷的 Claude Code 项目。
由华东师大智金院团队孵化的金融原生 Agentic Foundation Model 家族 Mint-Agent 正式发布。在 FinanceAgentBench v2 上,27B 的 Mint-Ag 达到 60.49%,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本分别仅为两者的约 22% 和 10%。
一个月的活,入职刚一年的工程师一天干完。
关于无缝衔接 Claude Code 和 Codex 这件事。
2024 年,Boris Cherny 加入 Anthropic 时,AI 编程产品大多还停留在代码补全和对话问答阶段。模型已经能够写出完整的函数和文件,但产品通常只允许它在编辑器里提出建议,很少真正赋予它读取代码库、修改文件和调用终端的能力。